Type: entity
Confidence: 0.70
Created: 2026-04-20
Updated: 2026-04-20
Tags: personreinforcement-learningPPO强化学习

John Schulman

概述

强化学习研究者,PPO(近端策略优化)算法的主要发明者,后成为 OpenAI 对齐团队核心成员。

关键内容

  1. PPO 论文(2017):发表《Proximal Policy Optimization Algorithms》,提出 PPO 算法,通过裁剪策略更新实现稳定高效的强化学习训练。
  2. PPO 影响:PPO 因其实现简单、调参友好、性能稳定,成为深度强化学习的主流算法,后被用于 InstructGPT 中的 RLHF 对齐。
  3. OpenAI 工作:在 OpenAI 期间参与 ChatGPT 的 RLHF 对齐工作,将 PPO 应用于大语言模型的人类偏好学习。

来源

相关